<!DOCTYPE html>
<html class="client-nojs vector-feature-language-in-header-enabled vector-feature-language-in-main-page-header-disabled vector-feature-page-tools-pinned-disabled vector-feature-toc-pinned-clientpref-0 vector-toc-not-available vector-feature-main-menu-pinned-disabled vector-feature-limited-width-clientpref-1 vector-feature-limited-width-content-enabled vector-feature-custom-font-size-clientpref-1 vector-feature-appearance-pinned-clientpref-0 skin-theme-clientpref-day vector-sticky-header-enabled" lang="de" dir="ltr"><head>
<meta charset="UTF-8">
<title>Within-document Frequency</title>
<meta name="viewport" content="width=device-width, initial-scale=1.0">
<link rel="icon" type="image/png" href="./_res_/favicon.png">
<link rel="canonical" href="https://de.wikipedia.org/wiki/Within-document_Frequency"> <link href="./_mw_/ext.math.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.wikimediamessages.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.icons.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.search.codex.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.styles.css" rel="stylesheet" type="text/css">
<meta name="ResourceLoaderDynamicStyles" content="">
<link href="./_mw_/ext.gadget.citeRef.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.defaultPlainlinks.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonHide.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonLayout.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonStyle.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiDarkmode.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiResponsive.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.specialSearch.css" rel="stylesheet" type="text/css">
<link rel="stylesheet" type="text/css" href="./_mw_/site.styles.css">
<link rel="stylesheet" type="text/css" href="./_mw_/noscript.css">
<link rel="stylesheet" type="text/css" href="./_res_/footer.css">
<link rel="stylesheet" type="text/css" href="./_res_/vector-2022.css">
</head>
<body class="skin--responsive skin-vector skin-vector-search-vue mediawiki ltr sitedir-ltr mw-hide-empty-elt ns-0 ns-subject page-Within-document_Frequency rootpage-Within-document_Frequency skin-vector-2022 action-view">
<div class="mw-page-container">
<div class="mw-page-container-inner">
<div class="mw-content-container">
<main id="content" class="mw-body">
<header class="mw-body-header vector-page-titlebar">
<h1 id="firstHeading" class="firstHeading mw-first-heading"><span class="mw-page-title-main">Within-document Frequency</span></h1>
</header>
<a id="top"></a>
<div id="bodyContent" class="vector-body ve-init-mw-desktopArticleTarget-targetContainer" aria-labelledby="firstHeading" data-mw-ve-target-container="">
<div id="contentSub">
<div id="mw-content-subtitle"></div>
</div>
<div id="mw-content-text" class="mw-body-content mw-content-ltr" lang="de" dir="ltr"><div class="mw-content-ltr mw-parser-output" lang="de" dir="ltr"><p><b>WDF (Within-document Frequency)</b> bedeutet die dokumentspezifische Gewichtung eines Wortes.
</p><p>Die Formel für die Dokumentspezifische Wortgewichtung wurde von Donna Harman entwickelt um Worten, die in einem Dokument vorkommen, einen für die <a href="Informationswissenschaft" title="Informationswissenschaft">Informationswissenschaft</a> nutzbaren Gewichtungswert zu geben. Dieser Gewichtungswert lässt sich zum Beispiel zusammen mit der <a href="Inverse_Dokumenth%C3%A4ufigkeit" title="Inverse Dokumenthäufigkeit">Inversen Dokumenthäufigkeit</a> (Inverse Document Frequency; IDF) und dem Gewichtungswert P zur einfachen Gewichtungsformel kombinieren. Mit dem WDF wird nicht die <a href="Relative_H%C3%A4ufigkeit" title="Relative Häufigkeit">relative Häufigkeit</a> eines Wortes im Dokument ermittelt, sondern ein gestauchter Wert, der besser verwendbar ist. Je höher die WDF eines Wortes ist, desto häufiger kommt dieses Wort im Dokument vor.
</p><p><b>Die Formel</b>
</p><p><span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle WDF(i)={\frac {\log _{2}(\mathrm {Freq} (i,j)+1)}{\log _{2}(L)}}}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>W</mi>
<mi>D</mi>
<mi>F</mi>
<mo stretchy="false">(</mo>
<mi>i</mi>
<mo stretchy="false">)</mo>
<mo>=</mo>
<mrow class="MJX-TeXAtom-ORD">
<mfrac>
<mrow>
<msub>
<mi>log</mi>
<mrow class="MJX-TeXAtom-ORD">
<mn>2</mn>
</mrow>
</msub>
<mo><!-- --></mo>
<mo stretchy="false">(</mo>
<mrow class="MJX-TeXAtom-ORD">
<mi mathvariant="normal">F</mi>
<mi mathvariant="normal">r</mi>
<mi mathvariant="normal">e</mi>
<mi mathvariant="normal">q</mi>
</mrow>
<mo stretchy="false">(</mo>
<mi>i</mi>
<mo>,</mo>
<mi>j</mi>
<mo stretchy="false">)</mo>
<mo>+</mo>
<mn>1</mn>
<mo stretchy="false">)</mo>
</mrow>
<mrow>
<msub>
<mi>log</mi>
<mrow class="MJX-TeXAtom-ORD">
<mn>2</mn>
</mrow>
</msub>
<mo><!-- --></mo>
<mo stretchy="false">(</mo>
<mi>L</mi>
<mo stretchy="false">)</mo>
</mrow>
</mfrac>
</mrow>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle WDF(i)={\frac {\log _{2}(\mathrm {Freq} (i,j)+1)}{\log _{2}(L)}}}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/7870bb60ea9df40b9420fd482db46f18c4e3dfdf.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -2.671ex; width:31.794ex; height:6.509ex;" alt="{\displaystyle WDF(i)={\frac {\log _{2}(\mathrm {Freq} (i,j)+1)}{\log _{2}(L)}}}" loading="lazy"></span><br>
<br>
i=:Wort<br>
j=:Dokument<br>
L=:Gesamtzahl der Wörter in Dokument j<br>
Freq(i,j)=:Häufigkeit des Wortes i im Dokument j<br>
<br>
</p><p><i>Erklärung</i> zu „+1“:
falls Freq(i,j) = 0 ist, erreicht man mit dem „+1“, dass im Zähler log<sub>2</sub>(1) = 0 steht.
</p><p><b>Beispiel</b>
</p><p>Ein Dokument besteht aus 12000 Wörtern, also ist L=12000. Das Wort i kommt in diesem Dokument 23 mal vor, also ist Freq(i,j)=23.<br> Nun braucht man nur noch einsetzen und es entsteht:
</p><p><span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle WDF(i)={\frac {\log _{2}(23+1)}{\log _{2}(12\,000)}}}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>W</mi>
<mi>D</mi>
<mi>F</mi>
<mo stretchy="false">(</mo>
<mi>i</mi>
<mo stretchy="false">)</mo>
<mo>=</mo>
<mrow class="MJX-TeXAtom-ORD">
<mfrac>
<mrow>
<msub>
<mi>log</mi>
<mrow class="MJX-TeXAtom-ORD">
<mn>2</mn>
</mrow>
</msub>
<mo><!-- --></mo>
<mo stretchy="false">(</mo>
<mn>23</mn>
<mo>+</mo>
<mn>1</mn>
<mo stretchy="false">)</mo>
</mrow>
<mrow>
<msub>
<mi>log</mi>
<mrow class="MJX-TeXAtom-ORD">
<mn>2</mn>
</mrow>
</msub>
<mo><!-- --></mo>
<mo stretchy="false">(</mo>
<mn>12</mn>
<mspace width="thinmathspace"></mspace>
<mn>000</mn>
<mo stretchy="false">)</mo>
</mrow>
</mfrac>
</mrow>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle WDF(i)={\frac {\log _{2}(23+1)}{\log _{2}(12\,000)}}}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/4e0fa271e1e10db3cdd407627198929f85405eaf.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -2.671ex; width:24.81ex; height:6.509ex;" alt="{\displaystyle WDF(i)={\frac {\log _{2}(23+1)}{\log _{2}(12\,000)}}}" loading="lazy"></span>
</p><p>Als Ergebnis erhält man den Gewichtungswert WDF(i)= 0,3 (gerundet), zum Vergleich ist die relative Häufigkeit des Wortes i hier etwa 0,1917 % (<span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle {\frac {23}{12000}}}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mrow class="MJX-TeXAtom-ORD">
<mfrac>
<mn>23</mn>
<mn>12000</mn>
</mfrac>
</mrow>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle {\frac {23}{12000}}}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/219c32e567ef37c05d8196c394c065fb8094ff8e.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -1.838ex; width:6.648ex; height:5.176ex;" alt="{\displaystyle {\frac {23}{12000}}}" loading="lazy"></span>).
</p><p>Im Bereich der <a href="Suchmaschinenoptimierung" title="Suchmaschinenoptimierung">Suchmaschinenoptimierung</a> wird die Berechnung des Gewichtungswertes WDF genutzt, um die Relevanz der Webseite für eine Suchmaschine zu erhöhen. Gegenüber der einfachen Berechnung einer <a href="Suchwortdichte" title="Suchwortdichte">Suchwortdichte</a> wird bei der Berechnung durch den eingesetzten Logarithmus beim WDF - Wert verhindert, dass das Suchwort eine zu starke Gewichtung erfährt.
</p><p><b>WDF*IDF</b>
</p><p>In der Suchmaschinenoptimierung ist auch der Term <a href="WDF*IDF" class="mw-redirect" title="WDF*IDF">WDF*IDF</a> populär geworden (der ähnlich <a href="TF-IDF" class="mw-redirect" title="TF-IDF">TF-IDF</a> ist). Dabei wird die Relevanz eines Dokuments ins Verhältnis zum Wettbewerb gesetzt. IDF bezeichnet die inverse Dokumenthäufigkeit. Der IDF-Wert errechnet sich aus der Gesamtzahl aller indexierten, also der Suchmaschine bekannten Dokumente, geteilt durch die Anzahl all jener Dokumente, die den entsprechenden Suchbegriff enthalten. Das führt dazu, dass der (logarithmisch gestauchte) IDF-Wert umso höher ist, je weniger Dokumente es insgesamt zu dem jeweiligen Suchbegriff gibt. Umgekehrt gilt, dass der IDF-Wert gegen 1 sinkt, wenn das Suchwort bereits auf sehr vielen Seiten verwendet wird.
</p><p>Die WDF*IDF-Formel ergibt, dass ein relevantes Dokument umso höher gewichtet wird, je seltener seine Themenkombination bislang behandelt wurde, da es dann den bereits bestehenden Inhalten neue und potenziell nützliche Informationen hinzufügt. Entsprechend erhalten Dokumente, die für den Suchbegriff zwar ebenfalls relevant sind, und damit einen hohen WDF-Wert besitzen, aber im Wesentlichen nur das wiederholen, was in anderen Dokumenten bereits geschrieben wurde, einen niedrigeren IDF-Wert und damit eine insgesamt niedrigere WDF*IDF-Gewichtung. Mit einem Wert nahe 1 fällt der IDF-Faktor in der Gleichung WDF*IDF als Rankingfaktor dann kaum noch ins Gewicht.
</p>
<div class="mw-heading mw-heading2"><h2 id="Literatur">Literatur</h2></div>
<ul><li><i>Harman, Donna:</i> Ranking algorithms. – In: William B. Frakes; Ricardo Baeza-Yates (Hrsg.): Information Retrieval.<br>Data Structures & Algorithms. – Upper Saddle River, NJ: Prentice Hall PTR, 1992, 363–392.</li>
<li>Lecture Notes in Computer Science Vol. 1083 - Evaluating Natural Language Processing Systems von Karen Sparck Jones; Julia R. Galliers aus der Reihe Lecture Notes in Computer Science Vol. 1083. Berlin, Springer 1996.</li></ul></div><!--htdig_noindex--><div><div class="zim-footer">
Dieser Artikel wurde von <a class="external text" title="Zuletzt bearbeitet am 2025-10-30" href="https://de.wikipedia.org/wiki/?title=Within-document_Frequency&oldid=261086645">Wikipedia</a> herausgegeben. Der Text ist unter <a class="external text" href="https://creativecommons.org/licenses/by-sa/4.0/deed.de">Creative Commons Attribution-Share Alike 4.0</a> verfügbar, sofern nicht anders angegeben. Für die Mediendateien können zusätzliche Bedingungen gelten.
</div>
</div><!--/htdig_noindex--></div>
</div>
</main>
</div>
</div>
</div>
<script src="./_webp_/webpHandler.js"></script>
</body></html>